你没法用一句话,把品味提示进模型里

GPT-6 Astra 能打赢编程和 Agent 评测,却仍会做出一眼能看出来的“AI 高级感”网站。本文根据 @PrajwalTomar_ 的对照实验,拆开同一产品、同一模型、同一 brief 的两轮结果:独自生成为什么会失败,接上 60 万真实上线界面之后为什么会好起来,以及客户项目里真正该留下的研究—报告—再建—局部修补流程。

最好的编程模型发布两周了,信息流里全是它写代码、控电脑、跑长 Agent 的演示。

可代理公司每天收钱的那件事更无聊:能不能做出一个看起来不像 AI 做的网站。

@PrajwalTomar_ 把这个问题拿去问了 GPT-6 Astra。短答案是:它自己不行。更好的提示词也不行。

你没法把品味提示进模型里。你得先让它看见,什么叫好。

这句话值得贴在显示器上方。后面整套工作流,都是在给它找参考答案,而不是再写一遍“premium, editorial, magazine feel”。


所有 AI 网站长得像亲戚,不是因为模型笨

上周,一位咨询客户上线抱怨:试过能找到的每家 AI 建站工具,出来的都是同一张脸。得体衬线、鼠尾草绿、倾斜悬浮的手机、一句像诗但不办事的口号。

Astra 是作者用过最强的编程模型,它也交了同一张脸。

所以问题不在模型,也不在提示词。人人都在写“高端、编辑感、杂志质感”,然后花两小时跟输出搏斗。那些是品味词。模型不知道旅行品牌的高端、开发者工具的高端、银行的高端分别长什么样。它只能走向自己见过的、所有自称 premium 的网站的平均值。

平均值永远长一个样。

同一周,Griffin Wooldridge 的视频给了出路:把 Astra 接到 Mobbin——一座超过 60 万张、来自真实已上线 App 和网站的界面库——让模型先研究真东西,再动手。研究在前,构建在后。

作者当晚拿自己的项目复现。思路是 Griffin 的;下面是他跑出来的结果,以及代理公司为了能接真客户多加的几步。


同一产品,打两轮,只改一件事

实验产品叫 TripGlide,一款旅行预订 App。产品已经做完,一直没有落地页。旅行品牌是好考题:设计就是产品,丑页面留不住订单。

两轮共用同一个产品、同一个模型、同一份 brief。

第一轮:ChatGPT 里的 Astra,用 Sites 直接建站。
第二轮:给 Astra 接上 Mobbin MCP,让它在改页面前先翻真实上线界面。

Mobbin 不是赞助。他们代理公司付费用了大约一年,MCP 只是让模型自己去翻,而不是人肉贴图。不想付费也有免费版,后文会写。

第一轮 brief 原文很长,核心就一句:做成高端数字旅行杂志,顺便能预订。要有产品预览 Hero、使用方法、精选目的地、行程功能、社会证明、定价、FAQ、页脚。编辑排版、大留白、克制动效、完整响应式,需要的图自己生成。

十分钟十三秒,整站出来了。模块齐,能适配,图也有。它还老实声明:预订和支付只是预览,评价和定价是示例文案。

第一眼好看。这就是陷阱。

它不是弱模型那种灰扑扑的 Bootstrap 页。它是另一种通用:AI 高级感。看过五十个,下一秒就能认出来。


第一轮究竟露馅在哪

不是代码崩了。代码合格。露馅的是品味的平均值。

一部倾斜五度的手机,一张悬浮的“安心卡片”,生成图上印着 GPS 坐标,闪光点,太阳图标,明信片编号。六件随机道具都在演编辑感,没有一件在说产品是什么。

每个区块同一套标题公式:直立衬线,再跟一段鼠尾草绿斜体。“From what if to we're here.”“A plan for the trip. Room for the magic.” 一个好点子重复到变成模板。

文案像旅行,不说功能。“少开标签页,多起飞。”“少规划,多生活。”听得见氛围,看不见 App。

同一张阿马尔菲照片用了四次:主视觉、手机屏、卡片、行程弹窗。

手机模型里的字是 6px,产品预览不可读,只是摆设。

定价是编的,评价被自己标注成“示意旅行者故事,示例文案”。

模型从没被认真展示过,一个真正出色的旅行网站会做什么,于是它猜。它猜的结果,和所有 AI 工具猜的结果一样。


第二轮真正值钱的,不是重建,是那份报告

接入 Mobbin 大约两分钟:ChatGPT 里找 Apps,搜 Mobbin,授权。需要 Pro 及以上,免费套餐连不上。作者第一次连接失败,第二次才通,计划里要给这次来回留时间。

然后他做了大多数人会跳过的一步。不说“做得更好”。先研究,先写报告,批准之前不准动工。

研究提示词要求四件事:准确指出当前页面哪里像模板、像 AI;归纳最强真实案例的重复模式;提出更清楚的视觉方向;列出每一处改动和理由。

报告才是这套方法的产品。它逼模型把学到的东西摊开,再允许它花在你的页面上。

模型翻了 14 个真实界面,覆盖旅行站、旅行 App 和消费品牌,交出一份 28 项改动计划。第一句几乎把整场实验说完:

TripGlide 大件都在,但它是在用堆砌的装饰和可替换的语言,假装自己是高端旅行。

堆砌的装饰。可替换的语言。所谓 AI premium,七个字就够。

它骂自己的 Hero:太多熟悉的落地页装置在抢戏,画面缺少一个组织性想法。
骂自己的字体:一种有效处理,在几乎每个区块重复后变成公式。
骂自己的文案:反复对比、碎片句、打磨过的情绪,造出一种人造节奏。
骂目的地卡片:几乎没有决策支持。“大山。更安静的心”可以形容很多地方。

参考对象包括 KOBU 酒店页、Airbnb 发现流、Wanderlog 按天行程、TravelPerk 的 Hero、KÖPPEN、Face Formula。它从真站点里抽出六条公约数:

一个主导视觉想法;人们真正想要的具体事物;放对位置的清楚行动;图旁边就要有信息;大图和小细节各干各的;用真实产品证据,而不是道具。

方向被收成一句:TripGlide 是旅行编辑的精选,旅程已经可以开始规划。粉笔底、近黑正文、深橄榄按钮。标题一种衬线,实用信息一种无衬线。斜体偶尔用,而不是每个标题都用。

改动清单也不化妆。拿掉悬浮卡、太阳、坐标、闪光。停止复用那张阿马尔菲。把 6px 标签加到可读。重写 Hero,让它说出产品做什么。还有两个意外:删掉示例评价,因为伪造引言无法承担社会证明;在没有真实商业模型之前,先撤掉编造定价。

它也没有吹牛。移动端只标成风险,因为还没做浏览器检查;并写明“generic”是设计判断,不是检测 AI 作者的可靠方法。

作者说,这比多数代理公司一周交付的设计评审更像样。他回了一句:批准。按报告改现有站点。

十一分钟后,新版本挂在同一个 URL 上。


对照看完,才会相信“看过真东西”有多重要

新 Hero 只有一个主意,正是报告要求的。手机还在,但已经在人手里,并且在做事:Discover、Plan、Travel 三个标签,屏幕跟着切。这是报告从 TravelPerk 抽出来的结构——手里的产品,周围是有用的标注,而不是倾斜五度的道具。

手机旁边的卡片开始说人话。“海景住宿。波西塔诺,阿马尔菲海岸。”“把拉韦洛加进去。”上一轮悬浮卡写的是“一段像你的旅程”,什么也没说。

坐标、闪光、太阳、明信片编号消失了。导航变成 Destinations、How it works、The experience,按钮直接写 Explore the preview。

每个目的地终于有自己的行程。京都打开的是京都六日,有二年坂和东山;多洛米蒂打开的是从 Dobbiaco 出发的五日。上一轮每张卡都打开同一周阿马尔菲。报告把这叫决策支持,现在卡片里终于有一点。

行程从一张倾斜的“纸”变成可读的深橄榄产品面板。Day 01、02、03,上午下午晚上,并印着 Example stay, not reserved——这个站还不能预订,它选择把话说在前面。

它删掉了自己的谎。示例评价没了,假定价没了。FAQ 开始回答真问题:我能预订住宿或体验吗?这些照片是可预订地点吗?

然后是演示从不给你看的那一段。

它仍不完美。衬线加斜体的标题公式还在页上。“Your whole trip. Beautifully together.”“A little structure. A lot of freedom.” 报告点名过的那个破绽,模型自己又用了三次。若是客户站,这是作者会打回去的唯一一处文案。

可两版 Hero 并排时,结论已经够硬:同一个模型,同一份 brief,同一个产品。唯一改变的,是它动手之前看过什么。


第二轮之后,不要再把整页交给模型

永远会剩一处不对。永远。

错法是写“标题少一点诗意”,再放模型满页改。对的部分会跟着变坏。

之后每一次只围一道篱笆,句式固定:

一次修复,范围仅限某区块。只改这一处。其他什么都不要动。

放到这个站上,就是:一次修复,范围仅限标题文案。重写那三句衬线斜体,让它们说出产品的具体事情。其他什么都不要动。

这一句,往往比原始 brief 里所有品味词都更有用。


客户项目里,演示会跳过的四步

Griffin 的视频停在前后对比,作为演示足够。代理公司多做的几步,才是这套方法能在真项目上站住的原因。

先写设计系统。颜色、字号阶梯、间距、组件,一篇短文档,模型必须先读。没有它,研究阶段会把和品牌打架的模式一起拖进来。

再做页面研究。永远用那份四段式报告提示,不要说“做得更好”。研究、报告、等待。

构建之后先查移动端,再对仍然别扭的那一个区块做第二次研究。总有那么一块。只研究它,不要再碰整页。

最后把模式存进项目笔记。同一品类的下一个客户,从这些模式起步,而不是从零起步。

最后一步会复利。研究不是为这一页服务,它会变成一份越来越厚的品味档案。


不想付 Mobbin,流程仍然成立

免费版只是更慢。

打开品类里 10 到 12 个你真心佩服的真网站。每家截 Hero、一个内容区块、页脚。丢进对话,研究提示词里把“用这个 MCP”换成“研究这些截图”。

其余步骤不变。

你失去的是广度。60 万张界面和 12 张截图不是一个量级。你保住的是那件真正要紧的事:先研究,再构建。

限制也要说在客户电话之前。Mobbin MCP 需要 Pro,每次搜索消耗 AI 额度且没有公开单价;连接可能第一次失败;报告质量取决于提示词,“研究设计模式”只会得到摘要,四段式才会得到 28 项计划;Astra 喜欢在你只要改一个区块时重建整页,所以每次都要点名区块;模型可能贴得太近,报告若反复指向同一参考站,构建前要让它扩大样本;版式变好很快,照片仍会落后;这是营销站工作流,App 内界面作者仍从设计系统起步。

整张施工单可以收成一行:

Brief → 第一稿 → 接入真实参考 → 研究报告(先等)→ 第二稿 → 标注每一处改动 → 移动端检查 → 对弱区块做一次带篱笆的修复

设一次,每张落地页都跑,存下模式,下一次构建就从品味开始,而不是从零开始。

客户同一周拿到了网站。工作流留在了代理公司。实验的全部意义,也在这里。


写在最后

评测榜单奖励的是会写、会跑、会操作电脑。客户付钱买的是:这页看起来像一个有判断力的品牌,而不像一千个提示词的平均值。

Astra 很强,强到能在十分钟里交出一个完整、响应式、自带图的站点。也强到能把“高级旅行”猜成倾斜手机、鼠尾草绿和可替换金句。

差别不在会不会写代码,在动手前有没有被要求看过真东西,并且先交出一份它自己都得遵守的报告。

今晚你若只改一个习惯,就改这个:不要再对模型说“高端、编辑感、杂志质感”。先给它 12 张真截图,或一座真正上线过的界面库,让它写报告,你批准,再允许它碰页面。

品味不是一句形容词。品味是参考系。模型没有自己的参考系时,它会把整个互联网的平均值,当成你的品牌。

No comments yet